iT邦幫忙

2026 iThome 鐵人賽

DAY 7
0
Claude AI

從 AI 助理到營運中台:金融 PM 的 30 天 Claude Code 治理實戰系列 第 7

別讓 AI 幫你數數!業績資料稽核中,我們學到的 5 個反直覺教訓

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20260921/201446047ESgnBTKgE.jpg

引言:那個關於「貼資料問 AI」的常見誤區

月結前夕的辦公室,空氣中瀰漫著一種焦慮。我常看到同仁將整份業績 Excel 貼進 AI 對話框,急切地問:「幫我看這份資料有沒有問題?」結果 AI 第一次說缺值 3 筆,第二次說 5 筆,第三次又給出了另一組統計數據。

這種將大型語言模型(LLM)當作「全能計算機」的行為,是 AI 落地過程中最具代表性的誤區。作為架構師,我們必須在「確定性邏輯」與「機率性生成」之間劃出一道嚴格的非軍事區(DMZ)。本文將透過 TASK-002 業績品質檢核任務的實作,分享我們在構建 AI 稽核系統時,如何透過 5 個反直覺的教訓,實踐**「確定性計算不交給模型」**的核心美學。

https://ithelp.ithome.com.tw/upload/images/20260921/20144604RCSslpeR4P.jpg
重點一:分工的藝術——讓 Pandas 數數,讓 Claude 說話

在自動化架構中,我們將職責區分為「計算引擎」與「生成引擎」。直接讓 LLM 進行數值計算是極其不可靠且不可重現的。即便模型在 99 次測試中表現完美,只要有一次產生細微的「數值漂移」,整個稽核系統的公信力就會瞬間瓦解。

  1. 計算引擎 (Pandas): 負責邏輯比對與異常偵測。它是乾淨、不可變(Immutable)的真理來源。
  2. 生成引擎 (Claude): 負責將結構化的 Findings 轉譯為流暢、具備洞察力的文字報告。

這種分工確保了數據的嚴謹性,並貫徹「只讀不寫」的原則:計算引擎負責找出真相,模型(生成引擎)負責賦予真相溫度。

「缺值幾筆是 Pandas 數的,Claude 只負責把數好的結果寫成人話。」

https://ithelp.ithome.com.tw/upload/images/20260921/20144604R3PDsDRC6W.jpg
重點二:最小必要資料原則——別讓模型看到每一筆保費

從資訊安全的視角來看,將 42 列原始業績資料整份丟給 AI 是極其魯莽的。這不僅增加了資料暴露面,更是在用「最大暴露面去做最小的事」。

在 TASK-002 的設計中,我們餵入的是「結構化 Findings (JSON)」,而非原始資料。例如,當系統偵測到「R-240 保費異常」時,模型只需接收到該筆紀錄的 ID 與異常說明,它完全不需要知道另外 41 列正常成交的細節。透過將輸入內容精簡為純粹的異常結果,我們在實現自動化的同時,也守住了資訊安全的邊界。

https://ithelp.ithome.com.tw/upload/images/20260921/20144604jGIkP7kGum.jpg
重點三:全形數字的背後靈——當規則「看得懂」反而變成了錯

在測試中,我們遇到了一個極具啟發性的「審查悖論」。我們原本以為使用正則表達式 \d 能攔截所有非 ASCII 的髒資料。然而,在處理全形數字「1200000」時,系統竟然判定通過。

這是因為 Python re 模組的 \d 依據 Unicode 定義,會將全形數字視為合法的十進位數字;更危險的是,int() 函式也能「貼心」地將其轉型。這種隱式轉型與過度聰明的規則,讓全形字元在不同場景戴上兩張臉:它在格式檢查中瞞天過海,卻在下游統計與顯示時導致排版或計算失真。

架構師的修正: 將 \d 改為明確的 [0-9]。這告訴我們,在稽核系統中,我們不需要「聰明」的寬容,而需要「嚴謹」的刻薄。

https://ithelp.ithome.com.tw/upload/images/20260921/20144604rDbtyDFMIn.jpg
重點四:被極端值「繳械」的統計學——為什麼 3σ 會失效?

在偵測異常值時,傳統的「平均值 ±3 標準差 (3σ)」極易陷入「遮蔽效應 (Masking Effect)」。

假設資料中有一筆 5,000 萬的鉅額保單,它會強行拉高整體的平均值與標準差。結果會導致另一筆同樣異常的 800 萬保單(遠高於平均 30 萬至 260 萬的區間),因 z-score 不足而顯得「正常」。巨大的異常值會為其他異常值打掩護,讓統計引擎在極端情況下自動繳械。

實戰建議: 改用「IQR (四分位距) 法」,這是一種基於分位數、不受極端值干擾的穩健統計法。同時,我們嚴禁 AI 判定「錯誤」,僅能標註為「待人工確認」,並揭露資料缺失帶來的下游代價——例如因 R-225 缺分行代號導致統計失真,讓原本 -75% 的業績變動率在報表中呈現為 -83.3%。

https://ithelp.ithome.com.tw/upload/images/20260921/20144604dBn2eWJuvR.jpg
重點五:數位閘門 (Digital Gate)——專治 AI 幻覺的數字守門員

為了防治 AI 在產出草稿時產生「熱心推估」的幻覺(例如看見趨勢便自創「推估全年影響約 1.2 億」),我們建立了一套無狀態的數位閘門 (Digital Gate)。

這套機制不依賴 AI 的理解力,而是簡單的「集合交集」運算:

  • 白名單: 從計算引擎產出的 JSON 中提取所有合法數字。
  • 檢查: 掃描 AI 草稿中的每一個數字,若該數字不在白名單內,即刻攔截。

這項技術的價值在於**「保險」而非戰績**。雖然在我們的測試中,Claude 的表現優異到讓這道閘門鮮少開火,但在那關鍵的 1% 幻覺時刻,數位閘門就是防止虛假資訊流向決策層的最後一道物理屏障。

https://ithelp.ithome.com.tw/upload/images/20260921/20144604AjDBV02IFk.jpg
結論:AI 是優秀的文書,而非獨立的稽核員

在 TASK-002 的實驗中,我們成功讓 50 個測試案例全數通過。這項成功的關鍵不在於擁有了更強大的 AI,而在於我們為它打造了一個更嚴密的籠子。

我們必須承認:AI 是那位能把冰冷 JSON 轉化為優美敘事的「文書」,但它絕對不應是握有裁決權的「稽核員」。精確的邏輯必須留在傳統程式碼中,而 AI 則負責在精確的基礎上進行表達。


上一篇
當 AI 遇上現實:BAIOS 實戰日誌中的 5 個「反直覺」開發教訓
下一篇
別再叫 AI 幫你比對文件差異了!這 3 個常見誤區正讓你的法遵系統陷於險境
系列文
從 AI 助理到營運中台:金融 PM 的 30 天 Claude Code 治理實戰9
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言